第 6 章 处理真实世界的“脏材料”
真实材料不会排着队等你处理
练习包里的文件名、版本和目录都很规整,真实临床运营很少这么省心。邮件正文、微信截图、扫描件、带批注的 Word、合并单元格 Excel 和手写记录经常混在一起。WorkBuddy 可能读错内容,也可能把截图里的联系人、签名或通知栏一起带进工作区。我会先接收和筛查,再做任务副本,最后才交给 WorkBuddy。
这里说的“脏”,指结构混乱、上下文夹杂,并不是在评价文件质量。材料越乱,进入 WorkBuddy 前要做的人工检查反而越多。
我给材料安排了四个落点
text
原始接收区 → 人工风险筛查 → 批准的任务副本 → WorkBuddy 工作区- 原始接收区:保留原件和来源,不直接作为 WorkBuddy 工作区。
- 风险筛查:识别受试者信息、联系人、签名、盲态、凭证、隐藏数据。
- 任务副本:只保留完成目标所需内容,记录删改和版本。
- 工作区:仅放批准输入、参考边界和输出目录。
可下载使用 “脏材料”接收清单。
常见材料怎么处理
| 材料 | 隐蔽风险 | 进入前动作 |
|---|---|---|
| 微信/IM 截图 | 群名、头像、手机号、通知栏、无关聊天 | 裁切到最小范围;文字转录后人工核对;保留来源编号 |
| 邮件线程 | 签名档、抄送人、历史附件、不同版本混杂 | 提取与任务相关段落;记录发件日期和附件版本 |
| 扫描件/照片 | 姓名、签名、受试者编号、手写旁注 | OCR 后逐页核对;敏感字段按政策遮挡;低清晰度标记待确认 |
| Word | 修订、批注、隐藏文本、页眉页脚 | 决定使用清稿还是修订稿;把选择写进任务卡 |
| Excel | 隐藏表、公式、筛选、合并单元格、日期格式 | 展开结构;保留原始值与显示值;不要只复制当前可见区域 |
| SAS/R 日志 | _ERROR_、PUT 可能打印受试者级数据值 | 先清洗数据值;仅用虚构日志做初次验证 |
点“添加文件”之前,我会看五件事
“新建任务”的“+”菜单里有“添加文件”和“引用对话中的文件”。文件进场前,我会逐项检查:
- 这个文件是否已经进入批准的任务副本?
- 当前工作区是否足够窄?
- 引用旧对话文件会不会把另一个项目带进来?
- 文件里的隐藏内容是否也会被读取?
- 输出是否会暴露原本已遮挡的信息?
从聊天软件、邮箱或共享盘直接拖原件,往往会把无关对话、历史附件和隐藏字段一起带进来。“看看 AI 能不能读”也应当使用清理过的虚构副本。
入排核对有一段工作仍然留在 HIS 里
入排核对最花时间的部分,通常是去病历或 HIS 里找事实。通用 AI 往往碰不到这一步。教材里能做的是把入排标准拆成检查项,再对已经批准、最小化、脱敏的提取底表做交叉核对。这样的案例可以教核对方法,不能被宣传成“AI 帮你筛病人”。
看不清、对不上时,统一用四个状态
我在任务卡里只留四种状态:
待确认:材料未给出事实;无法辨认:扫描/OCR 质量不足;版本冲突:两个来源给出不同值;超出范围:需要访问未获批准的系统或资料。
常识、相邻日期、岗位惯例和旧项目经验都不能拿来补事实。缺了什么,就把缺口原样留下。
自己造一套“脏材料”测一下
用同一段虚构会议内容做三份材料:一张带无关头像的截图、一份有批注的 Word、一个合并单元格表格。完成接收清单后,再制作最小任务副本。三次输出放在一起,很容易看出 OCR、批注和表格预处理分别会带来什么错误。
处理完后,目录里应该看得出原件和副本
- [ ] 原件与任务副本分开保存
- [ ] 截图、扫描、Word、Excel 的隐藏风险均被检查
- [ ] 未把受试者级数据或凭证用于首次测试
- [ ] 模糊信息使用四种受控状态之一